메뉴

#LLM 최적화

HN
Hacker News • 56일 전
IMP 7

버스트성 LLM 추론을 위한 KV 캐시 예측 복제 기술

사용자 트래픽이 특정 시간에 집중되는 '버스트성(Bursty)' 환경에서 대형 언어 모델(LLM)의 추론 성능을 극대화하는 기술이 깃허브에 공개되었습니다. 트래픽 폭주를 예측하여 KV 캐시(Key-Value Cache)를 미리 복제해두는 방식을 통해, 서버 과부하나 지연 없이 빠르게 응답을 처리할 수 있도록 돕는 것이 핵심입니다.

LLM 최적화 KV 캐시 추론 성능
MP
MarkTechPost • 97일 전
IMP 8

시스코 AI, 자동 프롬프트 최적화 'FAPO' 오픈소스 공개

시스코 재단 AI가 여러 단계로 구성된 대형언어모델(LLM) 파이프라인을 자동으로 최적화하는 'FAPO' 시스템을 오픈소스로 공개했습니다. 이 도구는 프롬프트 실패 원인을 단계별로 분석하고 개선안을 제안하여, 기존 방식보다 훨씬 뛰어난 정확도 개선 효과를 입증했습니다. AI 개발 실무자들이 복잡한 프롬프트 엔지니어링 과정을 효율적으로 자동화할 수 있다는 점에서 중요하게 평가받습니다.

시스코 AI 프롬프트 엔지니어링 LLM 최적화
HN
Hacker News • 98일 전
IMP 7

점점 복잡해지는 LLM 아키텍처

초기의 단순했던 LLM 구조가 다양한 어텐션 변형과 MoE 등의 도입으로 인해 추천 시스템만큼 복잡해졌습니다. 성능 최적화가 필수적인 요구사항으로 자리 잡으면서 연구 개발의 유연성이 크게 떨어지는 문제가 발생하고 있습니다. 이를 해결하기 위해 초기부터 모듈의 조합과 검증이 용이한 구조 설계(FlexAttention 등)가 필수적입니다.

모델 아키텍처 LLM 최적화 FlexAttention
HN
Hacker News • 148일 전
IMP 8

LLM 초저비트 양자화 툴킷 AutoRound

대규모 언어 모델(LLM) 및 비전 언어 모델(VLM)을 위한 고급 양자화 툴킷인 AutoRound가 소개되었습니다. 이 도구는 부호 기반 경사 하강법(Sign-gradient descent)을 활용하여 2~4비트의 초저비트 환경에서도 높은 정확도를 유지하며 빠르고 저렴하게 모델을 최적화할 수 있습니다. 또한 주요 인퍼런스 프레임워크인 vLLM, SGLang, Transformers 등과 원활하게 통합되어 활용성이 매우 뛰어납니다.

양자화 (Quantization) 오픈소스 (Open Source) LLM 최적화
TC
TechCrunch AI • 162일 전
IMP 8

미국 이커머스 AI 유입 393% 폭증…매출도 끌어올려

Adobe의 최신 데이터에 따르면, 소비자들의 AI 쇼핑 어시스턴트 활용이 늘어나면서 미국 소매업체 웹사이트의 AI 트래픽과 전환율이 급증했습니다. AI를 통한 유입 고객은 일반 고객보다 체류 시간이 길고 구매 전환율도 높아져, 이제는 실제 매출 증대의 핵심 동력으로 자리 잡았습니다. 다만, AI가 상품 페이지에 제대로 접근하지 못하는 경우도 많아 기업들의 최적화(LMO)가 시급하다는 지적이 나왔습니다.

AI 트래픽 이커머스 전환율